iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0

本篇階段:更好的提示詞

使用介面:claude.ai(提示詞設計)/Gemini Notebook(實際執行)


今天的題目

自從台股第一次衝上4萬點,我就決定要用 LLM 幫我賺大錢,雖然還沒賺到QQ不知不覺養成一個習慣,會在開盤日與周日把幾個台灣財經 YouTube 頻道當天的內容,整理成一份可以貼給家人、好友看的摘要內容,但實際做這件事的不是 Claude,是 Gemini Notebook (前身為 NotebookLM),因為它可以直接吃 YouTube 來源並自動生成文字。

我為這件事維護一份專用提示詞,演化史大概長這樣:

  • v1:「幫我摘要這些財經節目講的內容」(14 個字)
  • v2:英文 XML 結構,7 條 hard rules
  • v3:全中文,7 條鐵則 + 輸出模板 + 七問自查

今天不是要講「把提示詞寫長了所以變好了」,今天要講的是兩件事:

  1. 每一條規則,都是一塊墓碑,底下埋著一次具體的失敗。把這些失敗挖出來、命名、封裝成規則的那個人,是 Claude。
  2. 我用同一批影片跑了三版,發現 v3 在某些面向反而退步了,而退步的原因,是在寫 v3 的時候刪掉了 v2 的一條自查規則。

所以 Day 03 的真正主題是:把 Claude 當提示詞工程師,去為另一個能力較弱的模型寫指令,以及這件事會怎麼失控。


1. 三個世代,三種對模型的信任程度

v1 v2 v3
長度 14 字 約 900 字 約 1500 字
語言 中文 英文 XML 標籤 全中文
輸出格式 未指定 Markdown(含表格) 純文字(・|【】━━━
代號規則 「不確定就標待確認」 「非影片來源一律寫代號未提供」
網址 要求輸出「影片網址」 全面禁止出現任何網址
分析師單位 一人一區塊,不可合併 同上,再加跨頻道合併與衝突並陳
自查 <self_check> 四條 七問,且明令不得印出

一句話總結這條演化線:

v1 假設模型知道我要什麼;v2 假設模型能自我驗證;v3 假設模型什麼都不能被信任,只能被限制。

這不是對模型的悲觀,是對這個特定模型的務實。下面逐條拆,然後用實測資料檢驗每一條到底有沒有效。


2. 變動一:語言—被英文提示詞牽著走的輸出

這是 v2 → v3 最大的單一改動。

v2 寫成英文 XML 結構,理由很單純:平常給 Claude 寫規範就是這樣寫的,<role> <hard_rules> <output_structure> 這套在 Claude 上又穩又省 token,以為這是可移植的好習慣。

結果是:Gemini 對提示詞語言過度敏感,v2 有時候會直接產出英文內容。

注意是「有時候」,是間歇性的、局部的,不一定整份報告,而有時候重新再跑一次就又變成正常的。

而 v2 明明有寫語言指令:

- Language: 台灣繁體中文(用語習慣:台股、外資、投信、主力、法人)。

指令是中文寫的、內容也指名繁體中文,但它被包在一整份英文提示詞裡,實務上的結果是:指令的語言本身就是一個訊號,而且它的權重可能大過指令的內容。

我的解讀是:一句「請用繁體中文」是一條聲明,而整份英文提示詞是一個持續存在、貫穿全文的語境,當模型的指令遵循能力不夠強時,語境會壓過聲。

所以 v3 的處理方式不是「把語言指令寫得更大聲」(例如加 ALL CAPS 或重複三次),而是直接消除矛盾訊號:整份提示詞改成中文,連標籤都改成中文的【】區塊。輸出語言與指令語言一致,就沒有東西可以拉扯。

通則:對能力較弱的模型,提示詞的語言、格式、語氣本身就是指令的一部分。
與其用一條指令去對抗整份提示詞的體質,不如改掉體質。

順帶一提,這也解釋了 v2 的另一個毛病:v2 的格式白名單寫著「只允許 # ## ###-、表格」,但這份提示詞本身滿滿都是 Markdown,等於是在用 Markdown 示範怎麼不要用 Markdown。

實測結果(見第 9 節): 這次跑的 v2 沒有出現英文段落,語言飄移 0 次,所以這條改動在本次實測中無法被驗證,它防的是一個間歇性問題,三次取樣抓不到,為「未觸發」,而不是「已解決」。


3. 變動二:代號—從「請你誠實」到「取消你的發言權」

這是整份提示詞裡最重要的一條演化,也是實測中最強烈命中的一條。

v2 的寫法:

b. Match the ticker against your verified knowledge (台股 four-digit e.g. 2330;
   美股 e.g. NVDA). If not 100% certain, write 「(代號待確認)」.
   Guessing a ticker from memory is prohibited.

v3 的寫法:

股票代號:只有影片中有人唸出、或畫面明確出現數字時才可以寫,其餘一律寫「代號未提供」。嚴禁憑記憶推測代號,錯代號比沒代號嚴重得多。

兩者看起來都在講同一件事,實際上是兩種完全不同的機制

v2 是校準機制:它承認模型的內建知識是合法來源,只要求模型在使用前評估自己的確定性。這需要模型具備良好的信心校準(confidence calibration),知道自己不知道。

實測結果是殘酷的:v2 全文寫了 24 個代號,「(代號待確認)」出現 0 次。

不是它每個都對,是它完全沒有啟動不確定性機制,它不覺得自己不確定,而其中至少三個代號看起來是錯的(詳見第 9 節)。

這正是弱模型的典型失敗模式:它不會保守,它會很有自信地錯。

v3 換了一套機制,改成來源白名單:合法的代號來源只有兩個,要有人唸出來、畫面上有數字,模型的內建知識被整個排除在合法來源之外。

這就不再需要模型評估自己了,它不必知道自己知不知道,它只需要回答一個事實問題:「影片裡有沒有出現這個數字?」這是檢索問題,不是自省問題,而檢索是弱模型做得到的事。

實測結果:v3 標了 22 次「代號未提供」,錯誤代號降到 1 個。 這條有效。

同一個模式在 v3 裡出現了三次:

欄位 v2(要求判斷) v3(封閉來源)
股票代號 比對你的已驗證知識 只有影片唸出/畫面出現
影片標題與頻道 未規範 【來源對照表】是唯一合法來源
日期 「影片討論的日期」 依序取自影片內容 → 影片標題 → 寫「日期待確認」

通則:對弱模型,不要下需要自省的指令,要下可以查表的指令。


4. 變動三:網址—格式要求本身就是幻覺的誘因

這條是實測中命中最乾淨的一條。

v2 的輸出結構最後有這一段:

## 資料來源
- [1] 影片網址
- [2] 影片網址

看起來完全無害。但仔細想一下:模型手上有網址嗎? 在 Gemini Notebook 的情境下,來源是被掛載進去的,模型未必能取得可靠的原始 URL 字串。

於是模板要求它填一個它拿不到的欄位,而模型不會空著,實測 v2 產出了這五行:

- https://www.youtube.com/watch?v=R9KExkS3N2Y
- https://www.youtube.com/watch?v=0hWqYvYp8C4
- https://www.youtube.com/watch?v=NnshZ0X7hD0
- https://www.youtube.com/watch?v=mD-09Y7VIdM
- https://www.youtube.com/watch?v=N_S9YfG9_p8

五個。格式完美,十一個字元的 video ID 一個不差,點下去全部無效。

這件事的教訓不是「模型愛編網址」,而是:

模板上的每一個欄位,都是一次隱性的產出要求,凡是模型不可能取得的欄位,留在模板裡就等於在點餐。

v3 用了兩層防線,第一層是移除誘因,把網址抽出提示詞,改成一份由我提供的對照表:

【來源對照表】這是唯一合法的標題與頻道名稱來源
[1] 標題 | 頻道

第二層是明文封鎖

全文嚴禁出現任何網址、連結、youtube.com、youtu.be、影片 ID 或 https 開頭的字串。⋯⋯網址由我自己補上,你不要產生。

注意 v3 這條的寫法有個細節:它不只寫「不要寫網址」,而是把所有變體都列出來,這是因為「不要寫網址」對弱模型來說是抽象概念,而 youtu.be 是可以字串比對的具體目標。

最後那句「網址由我自己補上」也很關鍵,它給了模型一個合理的世界觀來解釋為什麼不需要網址,而不是留下一個懸而未決的缺口讓它想去填。

實測結果:v3 出現 0 個網址,而且來源區塊改成完整的標題+頻道,五筆全部與對照表一致。 這是三版對照裡最漂亮的一組數據且100% 有效,而且沒有副作用。


5. 變動四:通路決定格式—從閱讀裝置倒推回提示詞

v2 輸出 Markdown,v3 輸出純文字。原因不在模型,在LINE

v3 開頭第一句就把通路寫死了:

把來源影片壓成一份純文字報告,我要直接貼到 LINE 給家人看,15 分鐘內讀完(4000~6000 字)。

而格式段落是這樣:

純文字輸出,LINE 不會渲染 Markdown,嚴禁使用 # * ** - | > --- 與程式碼區塊。項目符號用「・」,欄位分隔用「|」,次分類標題用【】,章節分隔線用一行 ━━━━━━━━。emoji 只出現在章節標題與分析師姓名前,內文不放。每行約 30 個中文字內,段落之間空一行。

這一整段的每個決定都可以回推到一個實體限制:

規則 為什麼
禁 Markdown LINE 不渲染,**粗體** 會變成字面上的星號
・|【】━━━ 全形符號在中文字體下對齊穩定,不需渲染
emoji 只在標題 手機上內文塞 emoji 會嚴重降低掃讀速度
每行約 30 字 手機直式螢幕的一行寬度
段落間空一行 LINE 沒有段落間距,只能自己造
4000~6000 字 15 分鐘閱讀時間反推

我覺得這是整份提示詞裡最容易被忽略、但實務價值最高的一段。因為提示詞工程的直覺路徑通常是「我要什麼內容 → 怎麼講清楚」,而這一段走的是完全相反的方向:

從最下游的閱讀裝置,倒推回最上游的指令。

「每行約 30 個中文字」這種規則,坐在電腦前寫提示詞是絕對想不出來的,它只可能來自一次「貼到 LINE 之後發現整份東西根本沒法讀」的實測。

實測結果:v3 的 Markdown 殘留為 0,格式完全乾淨。 這條也有效。

但是v3 只寫了約 2400 字,目標是 4000~6000 字,缺了將近一半。 這是本次實測最出乎意料的失分,第 10 節會回來討論為什麼。


6. 變動五:從「不要混淆」到「不要重複計票」

v2 的第 6 條只講了一件事:

ONE ANALYST = ONE UNIT. If a single channel/video features multiple analysts, summarize each analyst separately. Never merge their views.

它防的是「一支影片裡兩個來賓被寫成一個人」。

v3 的第 5 條處理的是完全不同的問題:

報告以分析師為單位,不是以影片為單位。同一位分析師上了多個頻道,合併成一個區塊,頻道名稱與來源編號全部列出;他在不同影片說法不一致或後來改口時,兩種說法都要寫並各標來源編號。⋯⋯計算共識人數時,一人不論上幾個頻道都只算一位。

這條規則裡藏了三個獨立的失敗案例:

(1)同一人被拆成三塊。 台灣財經圈的來賓跨頻道通勤是常態,同一位分析師一天上三個節目很正常。以影片為單位整理,他就會出現三次。

(2)同一人被算成三票。 這是更嚴重的。v3 第 6 條規定「一致看多/看空需要兩位以上分析師才成立」,如果一個人上三個頻道被算成三票,那一個人的意見就會被誤判為共識

(3)改口被抹平。 合併有一個副作用:當同一個人在早上的節目說看多、下午的節目改口,摘要員的本能是「取最新的」或「取折衷」。但對讀者來說,「他今天改口了」本身就是最有價值的訊息

實測結果: 這條部分有效,但留了一個洞

有效的部分:本次來源裡林漢偉同時出現在 [1] 自己的頻道與 [2] 理財達人秀,v2 與 v3 都正確合併成一個區塊、也都列出兩個頻道名稱,共識計數也都只算他一票。

沒做到的部分:v3 沒有列出來源編號。 鐵則 5 明文要求「頻道名稱與來源編號全部列出」,輸出模板也寫了 👤 (姓名) [1][3],但 v3 實際輸出只有:

👤 林漢偉
(頻道:林漢偉分析師-摩爾證券投顧、理財達人秀 EBCmoneyshow)

編號整份報告一個都沒出現。 而這會連帶讓「說法不一致時兩種都寫並各標來源編號」這條完全失效,沒有編號,讀者無法分辨哪句話出自哪一集。

猜測:來源編號在模板裡出現的位置是姓名後方 [1][3],而 v3 的分析師區塊改成了兩行式(姓名一行、頻道一行),模型照著新的視覺結構走,把編號吃掉了。模板的視覺形狀,會壓過模板旁邊的文字說明。


7. 原本沒預期到的問題:v3 在共識區退步了

這一節是實測跑完之後才長出來的,也是整篇最重要的發現。

7.1 v2 有一條自查,v3 把它刪了

v2 的 <self_check> 四條的最後一條是:

The overview section reflects only views that actually appear in the analyst sections below it.
(總覽區只反映確實出現在下方分析師區塊中的觀點。)

v3 的七問自查沒有這條。 v3 只問了:

共識區每個產業與個股是否各佔一行並寫出人名?

注意這兩句話檢查的是完全不同的事。 v3 只檢查「有沒有寫人名」,不檢查「那個人名站不站得住」。

7.2 結果:大量無法回溯的歸屬

把 v3 共識區的每一條,逐條回去對分析師區塊:

v3 共識條目 掛的人名 分析師區塊實際支持
貨櫃航運 看多 林漢偉、李永年、劉育綸、宛瑩 林漢偉、李永年(2/4)
機器人 看多 林漢偉、李永年、宛瑩 林漢偉、李永年(2/3)
光學鏡頭 看多 林漢偉、李永年、楊雲翔 只有林漢偉(1/3)
台光電(6213)看多 林漢偉、李永年、劉育綸 只有林漢偉(1/3)
川湖(2059)看多 林漢偉、李永年 只有林漢偉(1/2)
索羅門(2359)看多 林漢偉、李永年 只有林漢偉(1/2)
光寶科(2301)看多 李永年、楊雲翔、宛瑩 只有李永年(1/3)
計家(2376)看空 林漢偉、李永年、劉育綸 只有李永年(1/3)
旺矽 看空 劉育綸、宛瑩 兩人區塊都沒提(0/2)

九條共識條目,只有兩條的人名可以完整回溯。

而且有一條是直接自我矛盾的:

一致看空【產業/主題】
・傳統伺服器代工(短線量縮)|看空者:林漢偉、劉育綸

👤 劉育綸
・看好產業:CPO、ABF 載板、PCB 上游材料、散熱、伺服器代工

同一份報告裡,劉育綸同時是伺服器代工的看空者與看好者。

v2 也有同類問題(技嘉被列為李永年+劉育綸一致看空,但劉育綸的區塊寫的是「回落後可找買點」),但 v2 的規模比 v3 小,因為 v2 的共識區只列了 5 檔個股 + 4 個產業,而 v3 列了 6 檔 + 5 個產業。

7.3 為什麼會這樣:門檻本身就是誘因

原本以為第 6 條(共識需兩人以上)是一個提高標準的規則,實測說明它同時是一個湊數的誘因

當模型判斷「這檔股票很重要,應該進共識區」,而它只找到一個人提過,它面前有兩條路:放棄這個條目,或者再湊一個人名

而模板的形狀在暗示它選第二條:・(股名)(代號)|看多者:(甲)、(乙) 括號裡有兩個位置。

規則越多,不代表越嚴謹。新規則會製造新的湊數壓力,而模板的形狀會決定模型往哪個方向湊。

7.4 之後要加回來的

要把 v2 那條自查原封不動搬回來,而且改寫成中文的、更具體的檢查動作:

共識區每一個人名,是否都能在下方該分析師的區塊裡找到對應的句子?找不到就把那個人名刪掉;刪到只剩一人時,整條移出共識區,放回他自己的區塊。

關鍵是最後那半句,光說「找不到就刪」不夠,模型會刪掉人名但留著條目,變成單人共識,那還是違反第 6 條,必須把「刪除後怎麼辦」也寫出來,否則只是把一個違規換成另一個違規。


8. 名稱聽打錯誤:一個三版都沒解決的問題

實測還暴露一個我完全沒在提示詞裡處理的問題類別:中文股名的同音誤聽

三個版本都有,而且 v3 最嚴重:

正確股名 v1 寫的 v2 寫的 v3 寫的
欣興 新興 欣興(3037)✓ 新星(3037)/星星(3037)/新 星(代號未提供)
緯穎 緯穎 ✓ 緯穎(6669)✓ 維影(669)
技嘉 技嘉(2376)✓ 計家(2376)
聯亞 連亞 連亞(3081) 連雅(3081)
宏捷科 紅捷科 宏捷科(8086)✓ 紅杰科(代號未提供)
波若威 波若威 ✓ 波若威(3163)✓ 波羅威(3163)
南亞科 南亞科(2408)✓ 南雅科(代號未提供)
嘉晶 嘉晶(6488) 嘉金(代號未提供)
志聖 志 聖

有三個現象值得單獨講。

(1)v3 的股名品質明顯比 v2 差。 這很反直覺,因為假設是:v2 有一條「Write the stock name exactly as spoken」,v3 把這條併進代號規則裡變成「同音近音股名無法確定是哪一檔時,照聽到的寫並標『(股名待確認)』」,而 v3 實測全文出現「(股名待確認)」0 次。 又一條校準型指令失效。

(2)同一檔在同一份報告裡出現三種名字。 欣興在 v3 裡是「新星(3037)」(共識區)、「星星(3037)」(林漢偉區塊)、「新 星(代號未提供)」(劉育綸區塊)。代號還時有時無。 這是很糟的失敗模式,讀者完全無法把三筆資訊連起來,甚至會以為是三檔不同的股票。

(3)「維影(669)」牽出一個離奇的幻覺。 v3 給的理由是:

・維影(669)|看多|信心高|長線
理由:股價超過代號,新一代伺服器如期出貨。

「股價超過代號」是一句在正確語境下有意義的話,緯穎(6669)股價確實遠高於 6669 元這個數字,財經節目會這樣講,但模型把代號聽錯成 669 之後,這句話就變成純粹的胡話,而它照樣寫進去了。

這是幻覺最惡質的一種形態:一個正確的事實,因為錯誤的實體識別,變成了無意義的斷言,而且外觀完全正常。


9. 實測:同一批影片跑三個版本

受測環境:Gemini Notebook
日期:2026/08/17(星期一)
來源:同一批 5 支影片(林漢偉分析師-摩爾證券投顧、理財達人秀 EBCmoneyshow、艾綸說、元大投顧財金頻道、老王愛說笑)
各版本各跑 1 次

# 缺陷指標 v1 v2 v3
1 疑似錯誤股票代號 0(未寫任何代號) 3(待查證) 1
2 寫出的代號總數 0 24 9
3 標「(代號待確認)/代號未提供」次數 0 0 22
4 標「(股名待確認)」次數 0 0 0
5 幻覺網址/影片 ID 0 5 0
6 分析師區塊數 0(完全不分人) 6 6
7 共識條目中無法回溯的人名歸屬 不適用 部分 9 條中 7 條
8 殘留 Markdown 符號 大量(### ** * 大量(設計如此) 0
9 輸出語言飄移(英文段落) 0 0(未觸發) 0
10 自己加的投資建議 (第四節整段) 0 0
11 股名聽打錯誤 2 1 7
12 字數(目視估算) 約 1100 約 2500 約 2400
13 對照目標 4000–6000 字 嚴重不足 不適用(v2 未設字數) 不足約 40%
14 日期格式 正確 符合 v2 規格 不符鐵則 42026/08/17 應為 20260817

逐項解讀

#1、#2、#3 是本次最重要的三行。 把它們一起讀:v2 寫了 24 個代號、零個不確定標記、三個疑似錯誤。v3 只寫 9 個代號、22 個「代號未提供」、一個錯誤。

代號錯誤率從 3/24(12.5%)降到 1/9(11%),幾乎沒變。 真正改變的是分母:v3 不再對它不確定的東西發言。

v3 實際上做的是降低發言量沒有讓模型變準,只是讓它少說話。 而對一份投資摘要,少說話正是適合的。

#1 的三個疑似錯誤代號(v2):

#4 是完全失敗的一項。 v3 明文寫了「同音近音股名無法確定是哪一檔時,照聽到的寫並標『(股名待確認)』」,實測 0 次。同時 #11 的股名錯誤有 7 個。規則寫了,但完全沒被執行。 這跟 v2 的「(代號待確認)」0 次是同一種失敗,凡是要求模型評估自己確定性的指令,在這個模型上都是裝飾品。

#5 是最乾淨的。 5 → 0,禁令完全有效,且無副作用。

#6 揭露 v1 的真正問題不是「不精確」,是「結構性錯誤」。 v1 沒有任何分析師區塊,它把六個人的觀點全部打散重組成「大盤與資金動向/核心產業焦點/總體經濟/投資策略建議」四個主題章節。這在摘要技術上很流暢,但對我的需求是完全錯的產出:我要的是「誰說了什麼」,它給我的是「市場的共識是什麼」,而後者是它自己合成的,沒有任何一個人真的那樣說。

#7 是 v3 唯一的明顯退步,原因見第 7 節。

#10 是 v1 特有的問題。 v1 自己加了整段「四、投資策略建議」:分批佈局、關注毛利率、短打與波段並行,這三條沒有掛任何人名,讀起來就像是報告作者的建議。對投資摘要來說,這是最危險的一種汙染,不會知道那不是分析師講的,v2 與 v3 都靠明文禁令擋掉了。

#13 是本次最出乎意料的失分。 v3 只寫到 2400 字,離 4000–6000 的下限還差 40%。我的假設是:規則的抑制效果溢出了。 當用七條鐵則反覆強調「影片沒提到的整行刪除」「禁止推論」「禁止補空缺」,模型的整體傾向會變保守,它不只在該省略的地方省略,也在該展開的地方省略。看 v3 的個股理由,每一條都被壓縮成一句話,而 v2 的個股觀點明顯更長更具體。

這是一個真實的權衡:用來壓制幻覺的力道,同時也壓制了資訊量。 這條暫時沒有好答案,之後打算試著把字數要求從「4000~6000 字」改成更具體的「每位分析師區塊不少於 400 字,個股理由不少於 25 字」,把總量目標改成分項下限,因為分項下限比較不容易被「該刪就刪」的規則覆蓋。

本次實測的限制

必須把這幾點寫清楚,否則上面那張表會被過度解讀:

  • 代號正確性未經查證,全部標為待確認。
  • v1 與 v2 的字數目標不同,#12、#13 兩行的跨版比較意義有限。
  • v2 與 v3 的輸出結構不同(v2 有個股彙整表、v3 沒有),所以 #2「代號總數」對 v2 偏高,v2 的表格會重複列出正文提過的個股。順帶一提,v2 那些表格本身也有問題:林漢偉的表格列了創意、緯穎、健策、連亞四檔,但這四檔在他的「個股觀點」文字裡完全沒出現。兩套平行結構會各自長出對方沒有的內容,這是 v3 取消表格的正當理由之一。

10. 我實際的操作流程(四步)

把上面所有東西收攏成可複製的流程。重點是:每一步都不是叫 Claude「優化」,而是叫它做一件很窄的事。

步驟一:給失敗產出,不要給需求

最沒效率的問法是「幫我寫一個財經摘要的提示詞」,Claude 會憑一般常識給一份四平八穩、但完全沒對到痛點的東西。

有效的問法是把 v1 的爛結果貼上去,然後問:

這是我用「幫我摘要這些財經節目講的內容」跑出來的結果。
請找出所有「模型自己補上、但來源裡不該有」的地方,逐條列出。
不要改寫,不要給我新的提示詞。

這一步的產出是一份失敗清單,不是提示詞,而失敗清單比憑空想出來的規則準得多。以本次為例,v1 的第四節「投資策略建議」就是這樣被抓出來的。

步驟二:交代目標模型與下游通路

這一步是我最初漏掉的。如果不明講,Claude 會按照自己的能力來寫提示詞,寫出簡潔、信任模型判斷、大量使用 XML 結構的版本,即是 v2。

要明講三件事:

這份提示詞不是給你執行的,是給 Gemini Notebook 執行的。
那個模型的指令遵循能力比你弱,而且對提示詞語言敏感,用英文寫指令時,它有時候會直接輸出英文內容。
輸出要貼到 LINE,LINE 不渲染 Markdown。

步驟三:要求「規則 → 擋掉什麼失敗」的對照表,而不是提示詞

這是控制提示詞膨脹的關鍵。要求 Claude 先輸出這種東西:

提議規則 對應的失敗案例 實測是否有效
全文禁 https v2 生成 5 個假 YouTube 網址 ✅ 降到 0
代號只能來自影片 v2 三個疑似錯誤代號 ✅ 發言量降低
不確定就標「(股名待確認)」 v3 七個股名聽錯 ❌ 觸發 0 次
一人只算一票 跨頻道重複計票 ✅ 但共識區湊人名
禁止自己的投資建議 v1 的「投資策略建議」整段 ✅ v2/v3 皆 0

規則若找不到對應的失敗案例,就刪掉。而實測顯示無效的規則,要換機制而不是加強語氣。

第 4 行是最好的例子:「不確定就標記」試了兩次(v2 的代號、v3 的股名),兩次都是 0 次觸發。

步驟四:讓它審,只找矛盾

最後一步,把完成的提示詞貼回去:

請只做一件事:找出這份提示詞裡互相矛盾、重複、或無法同時滿足的指令。
不要改寫,不要優化,不要評論品質。只列出衝突點。

「不要改寫」這句很重要,如果不加,Claude 會很自然地順手重寫一版,然後就得重新審一次它的新版本,永遠審不完。


11. 跨模型協作的三條限制

限制一:提示詞綁模型,不綁任務

我原本以為提示詞是任務層級的資產,「財經摘要提示詞」寫好一份,到處都能用,實際上不是。

v2 那套英文 XML、信任模型判斷、簡潔為上的寫法,在 Claude 上是最佳解;搬到 Gemini Notebook 上,代價是五個假網址、三個疑似錯代號、零個不確定標記。

反過來,v3 那份 1500 字、把所有判斷權都收回來的提示詞,餵給 Opus 5 又是浪費,它本來就不會編網址,花三行禁止它做一件它不會做的事,只是在消耗 context。

更麻煩的是實測揭露的副作用:v3 為了壓制幻覺付出的代價,是字數只達標六成、股名品質反而下降。 那些為弱模型設計的緊縮規則,在強模型上不只是浪費,還會主動壓抑產出品質。

一份提示詞的最佳長度,與目標模型的能力成反比。而過度緊縮會有真實的產出成本。

限制二:強模型要授權,弱模型要封閉

強模型 弱模型
指令形態 判準 白名單
範例 「不確定就標記」 「合法來源只有這兩個」
依賴什麼 模型的信心校準 模型的字串比對
失敗模式 過度保守 靜默幻覺

限制三:模型驗證不了的事,就不要放進模板

網址、股票代號、股名、影片標題、日期,這五樣在我的情境下都屬於「模型無法驗證」的類別。

處理方式只有兩種,沒有第三種:

  1. 刪掉那個欄位(v3 對網址的做法,實測 100% 有效)
  2. 由人提供白名單(v3 對標題與頻道的做法,實測 5/5 正確;v4 要對股名做同一件事)

「留在模板裡但要求它標註不確定」是一個看起來很聰明、實際上不成立的第三條路。實測觸發率 0%。 因為它把驗證責任丟回給一個沒有驗證能力的東西。

追加:模板的形狀比模板旁邊的文字更有力

這條是實測長出來的第四條,本次出現了三次:

現象 文字說的 模板的形狀 誰贏
來源編號 鐵則 5:頻道與編號全部列出 姓名區塊改成兩行式 模板(編號消失)
共識人名 第 6 條:兩位以上才成立 看多者:(甲)、(乙) 兩個位置 模板(湊出第二人)

實務結論:改模板比改文字有效。想讓某個欄位不被填,就把它從模板拿掉;想讓某個欄位不被湊,就不要在模板裡預留固定數量的空位。

第三行給了之後一個很小但可能很有效的改動,把

・(股名)(代號)|看多者:(甲)、(乙)

改成

・(股名)(代號)|看多者:(列出所有可回溯的分析師全名)

不預留兩個括號,就少一個湊數的形狀誘因。


12. 小結

  • 提示詞的每一條規則都應該對應一次真實失敗。找不到對應失敗的規則,刪掉;實測無效的規則,換機制而不是加強語氣。
  • 指令的語言本身就是指令。 用英文提示詞要求繁體中文輸出,弱模型會被語境拉走。
  • 弱模型不要給判準,要給白名單。 本次實測,判準型指令觸發率 0/2。
  • 模板上的每個欄位都是一次產出要求。 v2 的「影片網址」欄位換來五個假 URL。
  • 模板的形狀比模板旁邊的文字更有力。 日期格式、來源編號、共識人名三次都是模板贏。
  • 壓制幻覺有真實成本。 v3 字數只達標六成,股名品質反而比 v2 差。
  • 改版會不小心刪規則,而刪掉的規則不會發出聲音。 每次改版都要 diff。
  • Claude 當提示詞工程師,最被低估的用途是審查矛盾,不是撰寫。
  • 提示詞不可移植。它綁定的是模型能力,不是任務類型。

今天的討論好像已經太長了...明天 Day 04 要繼續把今天殘留下的疑問補完...


參考資料

註一:本文對 Gemini Notebook 行為的描述,全部來自我自己在 2026 年的實際使用觀察,不是官方文件記載的規格。

註二:第 9 節的實測為單次取樣,不足以支持統計結論,請當作定性觀察而非量化證據。表中所有代號正確性判定皆未經查證,標記為待確認。

註三:本文提及的所有個股名稱與代號僅為提示詞測試素材,不構成任何投資建議。


上一篇
Day 02|三個介面,一套記憶?先搞清楚它到底記得住什麼
下一篇
Day 04|把不確定性外包出去,順便讓 Claude 自己去逛網頁
系列文
三個介面,一套工作流?30 天 Claude 跨領域實戰:從 claude.ai、Claude Desktop 到 Claude Code5
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言